买了一台 AI 迷你主机,想跑本地大模型,但打开教程一看——装驱动、配环境、下模型、调参数,每一步都有坑。有人卡在驱动安装,有人下完模型发现跑不动,有人跑起来了但不知道怎么让其他程序调用。
这不是你一个人的问题。本地部署大模型确实有门槛,但用对工具之后,整个过程可以压缩到 30 分钟以内。
以 Ollama(目前最流行的本地大模型部署工具)为例,手把手教你从零到跑通,覆盖 环境准备、安装部署、模型运行、API 调用、性能调优 等流程。
| 配置项 | 最低要求 | 推荐配置 | 说明 |
|---|---|---|---|
| 内存 | 16GB | 32GB | 7B 模型需 16GB,13B 需 32GB |
| 存储 | 50GB 可用 | 256GB+ SSD | 每个 7B 模型约 4.5GB |
| 操作系统 | Windows 11 / Ubuntu 22.04 | Ubuntu 22.04 LTS | Linux 下性能更好 |
| 网络 | 仅首次下载模型需要 | 宽带连接 | 下载模型后完全离线可用 |
| 型号 | 内存 | 推荐模型 | 预期速度 |
|---|---|---|---|
| PB1001 | 16GB DDR4 | Qwen2.5-7B Q4 | 6~10 token/s |
| PB1202 | 16GB LPDDR5 | Qwen2.5-7B Q4 | 8~12 token/s |
| PB1301 | 16GB LPDDR5x | Qwen2.5-7B / 13B Q4 | 15~25 token/s |
| PB1401 | 16GB DDR4(RTX 3060) | 7B~13B FP16 | 40~60 token/s |
| PB1501 | 128GB LPDDR5x | 70B Q4 | 可跑 |
| PB0601 | 6GB LPDDR4 | Qwen2.5-7B INT8 | 8~12 token/s |
| PB0801 | 6GB LPDDR4 | Qwen2.5-7B INT8 | 8~12 token/s |
Ollama = 本地大模型的“一键安装器”
它的核心价值:
一条命令安装:不需要手动配 Python 环境、CUDA 驱动
一条命令跑模型:ollama run qwen2.5 即可开始对话
自动模型管理:自动下载、版本管理、内存优化
提供 API 接口:其他程序可通过 HTTP 调用本地模型
支持多平台:Windows / macOS / Linux / ARM
一句话:Ollama 让本地跑大模型从“需要折腾一整天”变成“30 分钟搞定”。
步骤 1:访问 Ollama 官网下载页
text
https://ollama.com/download/windows
步骤 2:双击安装包,一路“下一步”完成安装
步骤 3:安装完成后,打开 CMD 或 PowerShell,输入验证:
bash
ollama --version
显示版本号即安装成功。
x86 系列安装:
bash
curl -fsSL https://ollama.com/install.sh | sh
ARM 系列(PB0601/PB0801)安装:
bash
# ARM 版 Ollama 安装 curl -fsSL https://ollama.com/install.sh | sh
验证安装:
bash
ollama --version
| 模型名称 | 参数量 | 文件大小 | 中文能力 | 适用场景 |
|---|---|---|---|---|
| Qwen2.5-7B | 7B | ~4.5GB | ⭐⭐⭐⭐⭐ | 中文对话、公文起草、摘要 |
| Llama 3.1-8B | 8B | ~5GB | ⭐⭐⭐ | 英文内容、代码生成 |
| DeepSeek-V2-13B | 13B | ~7.5GB | ⭐⭐⭐⭐⭐ | 复杂推理、数据分析 |
| ChatGLM3-6B | 6B | ~3.5GB | ⭐⭐⭐⭐ | 轻量中文对话 |
| Qwen2.5-14B | 14B | ~8GB | ⭐⭐⭐⭐⭐ | 高精度中文场景 |
新手推荐:从 Qwen2.5-7B 开始——中文能力强、文件大小适中、16GB 内存即可运行。
bash
# 下载并运行 Qwen2.5-7B(Q4 量化版本) ollama run qwen2.5:7b-instruct-q4_K_M
首次运行会自动下载模型(约 4.5GB,视网速 5~30 分钟)。下载完成后自动进入对话界面。
验证部署成功:
text
>>> 你好 你好!我是通义千问,有什么可以帮你的吗?
如果模型正常回复,说明部署成功。
bash
# 查看已下载的模型列表 ollama list # 运行指定模型 ollama run qwen2.5:7b-instruct-q4_K_M # 删除不需要的模型(释放存储空间) ollama rm qwen2.5:7b-instruct-q4_K_M # 查看正在运行的模型 ollama ps # 停止当前模型 /bye
这是本地部署的核心价值——断网也能用。
验证步骤:
拔掉网线 / 关闭 Wi-Fi
重新运行模型:
bash
ollama run qwen2.5:7b-instruct-q4_K_M
输入问题,确认模型正常回复
全程无任何联网请求
通过验证 = 完全离线可用
Ollama 默认启动 API 服务(端口 11434),可直接调用:
bash
curl http://localhost:11434/api/generate -d '{ "model": "qwen2.5:7b-instruct-q4_K_M", "prompt": "你好", "stream": false }'
如果需要局域网内其他设备(如另一台电脑、手机)调用模型:
bash
# Linux 系统:修改服务配置 sudo systemctl stop ollama sudo vim /etc/systemd/system/ollama.service # 在 [Service] 下添加环境变量 Environment="OLLAMA_HOST=0.0.0.0:11434" # 重载并重启 sudo systemctl daemon-reload sudo systemctl start ollama
配置后,内网其他设备可通过 http://[设备IP]:11434 访问 API。
bash
# Linux 系统 sudo systemctl enable ollama sudo systemctl start ollama # 验证状态 sudo systemctl status ollama
Windows 系统:
打开任务管理器(Ctrl+Shift+Esc)
点击“启动”选项卡
找到 Ollama,确保状态为“已启用”
bash
# 将更多模型层分配到 GPU/NPU(PB1202/PB1301) ollama run qwen2.5:7b --num-gpu 999
bash
# 增加上下文窗口(默认 2048,可调至 8192) ollama run qwen2.5:7b --ctx-size 8192
bash
# 查看推理速度(输出末尾显示 tokens/s) ollama run qwen2.5:7b --verbose
各型号预期速度(7B Q4) :
| 型号 | 预期速度 | 说明 |
|---|---|---|
| PB1001 | 6~10 token/s | Vega 8 核显 |
| PB1202 | 8~12 token/s | Radeon 660M 核显 |
| PB1301 | 15~25 token/s | 50 TOPS NPU 加速 |
| PB1401 | 40~60 token/s | RTX 3060 CUDA 加速 |
| PB0601/PB0801 | 8~12 token/s | 6 TOPS NPU 加速 |
解决:使用国内镜像源(如 modelscope),或手动下载模型文件后导入 Ollama。
排查:
bash
# 查看当前运行模型是否使用 GPU ollama ps # AMD 显卡检查驱动 rocm-smi
排查:
bash
# 查看内存使用 free -h # 16GB 内存跑 7B Q4 够用(约 4.5GB) # 13B Q4 建议 32GB
解决:选择更小的量化版本(如 Q3),或升级内存(PB1001 支持双 SO-DIMM 扩展)。
排查:
bash
# 确认 NPU 驱动已加载 ls /dev/dri/ # 确认 RKNN 版本 rknpu2_version
如遇问题,联系华一精品技术支持获取离线驱动包。
A:
Ollama:命令行操作,适合开发者和自动化脚本;模型库更丰富
LM Studio:图形界面,适合非技术用户;Windows 下对 AMD 显卡支持更友好
两者都支持华一精品全系列 AI 迷你主机。
A:可以。 模型下载完成后,Ollama 完全离线运行,不需要联网。这是本地部署相比云端 API 的核心优势。
A:13B 模型在复杂推理、多步骤任务、代码生成上明显更准确。如果只是日常对话和文档摘要,7B 够用。如果涉及复杂分析,建议上 13B(需 32GB 内存)。
A:可以,但需注意内存。16GB 内存同时跑两个 7B 模型会紧张,建议 32GB 以上。PB1501(128GB)可以同时跑多个模型。
A:Ollama 提供标准 REST API(端口 11434),任何支持 HTTP 请求的程序都可以调用。OpenClaw、LangChain、Dify 等框架均支持对接 Ollama。